一起来看一下成品:
准备工具
ChatGPT https://chatgpt.com/c/
nanobanan pro https://labs.google/fx/tools/flow/
seedance2.5/seedMusic1.0/seedream5.0pro https://jimeng.jianying.com/ai-tool/home/
seedanceAudio 1.0 https://ark.volcengine.com/
倘若不知道模型怎么使用,可以参考这个教程(https://www.super-i.cn/info-2796.html),与本教程一起使用
https://www.flowpix.club/bj/40697.html?token=ad91f278bbac08b9349aa5412a79eab4
制作流程图:

第一步:先生成一张风格板
风格板可以理解为整条视频的“视觉说明书”。它需要提前规定画面使用什么色彩、字体、材质、构图、图形元素和信息层级。后续所有图片都参考同一张风格板,才不会每个镜头像来自不同的视频。
我的选题是银河系中心,所以风格板采用了宇宙档案与编辑拼贴的方向:深空藏青作为主色,象牙白纸片承载文字和数据,红色用于路线与重点,黄色和青色用于科学标记。
将准备好的风格板提示词输入 Nano Banana Pro,生成一张完整风格板。
主风格板——COSMIC VOXSTAGE 宇宙解说视觉系统。单张16:9参考板,制作一张完成度精良的美术指导风格板,用于定义宇宙、天文、星系、航天探索类 VOX 风格解说视频的整体视觉语言。整体采用编辑式网格系统、统一页边距、清晰的分区标签与模块化信息编排。板内文字不是占位说明,而是有意保留的视觉设计元素,因为这是一张完整的风格指导板。
表面质感与氛围:以深空星图、宇宙尘埃纹理、旧天文档案纸张、轨道示意线和科研资料拼贴作为底层视觉场域,保留清晰可见的纸张颗粒、印刷肌理、网点质感与轻微磨损痕迹。整体气质理性、冷静、克制,兼具科学纪录片的权威感与宇宙题材的神秘感。画面应具有明显层次,既像新闻编辑部的信息设计板,又带有探索宇宙未知的视觉吸引力。
字体样本面板:一级标题样本使用“The Deal”风格,采用高瘦、紧凑、粗体的大写英文标题字,适合表现宇宙主题的大命题,例如“THE UNIVERSE”“DARK MATTER”“MILKY WAY”;巨型统计数字样本如“13.8B YEARS”“93B LY”作为核心视觉元素,形成强烈的信息重心;小型注释标签样本使用“Fig. 1 – Orbital Path”“Data – Deep Space Signal”等样式。所有文字必须排列精准、边缘清晰,不得出现字形扭曲、变形、错误拼写或无意义乱码。
色板条:
带标签的标准色块——深空蓝 Deep Space Navy #0E1624、宇宙灰 Cosmic Gray #6F7682、星图米白 Archive Ivory #D8D1C2、信号红 Signal Red #D84232、星尘黄 Stardust Yellow #D8A94B、冷光青 Plasma Cyan #7FB8C9。深空蓝作为主体背景色,星图米白用于纸张与说明层,宇宙灰用于辅助信息与线稿,红色仅用于描边、箭头、下划线和关键信息强调,星尘黄与冷光青作为少量辅助强调色,用于星体标记、轨道信息或科学术语高亮。
组件样本库面板:一个通用人物的黑白网点剪纸形象,代表解说中的“人类尺度”;一颗带有纸质拼贴边缘的行星切片;一张醒目的大数字数据卡;一组轨道弧线与星图定位标记;一张带白色细边框的天文档案照片卡;一枚红色箭头标记;一条手绘式红色下划线;一块带撕裂纸边的标签说明卡;一个望远镜、火箭或卫星的黑白档案剪贴图。所有组件必须遵循统一构造逻辑:黑白网点印刷质感、粗粝白边剪贴轮廓、轻微错位的红色套印描边,以及编辑式信息图表语言。
微型场景面板:包含3个小型示例画面——(a)两名黑白网点人物站在深空舞台中间,人物前方悬浮一张显示“13.8B YEARS”的数据卡,背景为星图与星云纹理;(b)一张宇宙地图或太阳系轨道图,上方设置定位标记与轨道线,并在图注下方划过一道红色下划线;(c)一张带撕裂纸边的档案照片卡,展示行星、月球表面或星系照片,旁边搭配一枚星尘黄色标签与简短注释。三个画面必须保持完全统一的光线、材质、拼贴逻辑与成片质感。
运动缩略图:包含4个仅使用箭头标示动作的微型分镜——人物剪纸从画面边缘弹出入场,并带有轻微过冲回弹;巨型数字逐格跳动增长;红色下划线从左向右划过关键词语下方;摄影机在整个宇宙舞台场域中保持约20%的缓慢漂移,产生轻微的空间纵深与探索感。运动设计应克制、清晰、信息导向,不做夸张炫技,而是服务于 VOX 式解说节奏。
其中一个面板用于展示“THE STAGE”:这是所有镜头共同存在的持久背景世界。画面是一片低饱和、高层次的深空档案场域,由星图、宇宙尘埃、轨道线、纸张拼贴、半色调纹理和旧科研图版共同构成。该背景需要保持空置、稳定、可承载人物剪纸、数据卡片、标题、标注和星体元素的自由进出。空间要预留充分,光线均匀,明暗关系清晰,但不得出现会抢夺主体的复杂中景元素。
图像主题指向:整体视觉内容应围绕宇宙解说展开,可涵盖银河系、太阳系、黑洞、恒星演化、行星对比、太空探索、火箭发射、探测器、星云、天文观测、宇宙尺度、时间尺度等主题。图像内容必须更偏“知识解释”和“信息展示”,而不是纯幻想科幻海报。重点是把科学信息、空间感与拼贴视觉结合起来,形成强辨识度的 VOX 宇宙解说风格。
最终质感:保留印刷颗粒、半色调网点、纸张纤维、撕裂纸边和哑光纸张表面;允许画面具有深空氛围,但禁止光亮的CG三维质感,禁止廉价科幻海报效果,禁止强烈镜头光晕和过度炫光。不出现水印、Lorem Ipsum占位文字、无关品牌标志或随机乱码;画面中出现的每一个可见词语,都必须来自以上明确指定的文字样本或宇宙主题术语。整体成片应像一张成熟、专业、可直接指导后续宇宙 VOX 视频设计的视觉风格板。

直接使用nanobanan pro生成
如果更换题材,可以直接让 AI 修改现有提示词,不必从零重写。例如,要制作一条讲解中国三国史的 VOX 视频,可以这样提问(将上方的提示词一起给AI,然后让其修改):
我要做一个讲解中国三国史的vox视频,帮我更改一下这段提示词以适配我的风格。
这一步的通用原则是:保留提示词的结构,替换题材专属的视觉元素。宇宙题材可以使用星图和轨道,历史题材可以使用地图和时间线,商业题材可以使用产品档案和数据图表。
第二步:准备一段适合画面表达的剧本
格板决定视频“长什么样”,剧本决定视频“讲什么”。
我的剧本由 AI 协助完成。先让 AI 提供几个宇宙科普选题,我选择了“银河系中心到底藏着什么”,随后让它将内容精简成短视频剧本。
实际使用的剧本如下:
0:00—0:06
如果我们从地球出发,一直朝银河系中心飞,最后会看到什么?
0:06—0:13
那里距离我们大约2.6万光年。 越靠近中心,恒星越密集,原本漆黑的宇宙开始被无数星光填满。
0:13—0:20
但奇怪的是,我们却很难直接看见银河系中心。 大量星际尘埃,挡住了来自那里的可见光。
0:20—0:28
当我们换成红外线观察,尘埃背后的世界终于出现。 而科学家发现,一些恒星正在以极高速度,围绕一个“看不见的东西”运动。
0:28—0:38
它就是人马座A*。 一个质量超过太阳400万倍的超大质量黑洞。
0:38—0:48
它周围聚集着大量恒星和高温气体,构成了银河系最极端的区域之一。
0:48—0:55
但当镜头再次拉远,你会发现—— 如此庞大的黑洞,在整个银河系中,依然只是一个几乎看不见的小点。
结尾: 这里,就是我们银河系最深处的世界。
适合这类视频的剧本通常具备三个特点:开头提出一个能被画面回答的问题;中间不断提供新的视觉信息;结尾回到一个清楚的认知反差。
不必把每个镜头限制成相同长度。简单的信息可以短一些,复杂的空间穿越或答案揭晓可以长一些。单段最好不要超过视频模型可以稳定处理的长度;在我的 Skill 中,单段上限设置为 10 秒。
第三步:用 Skill 生成图片提示词
准备好风格板和剧本后,将两者一起交给 Codex、ChatGPT,或其他能够安装和运行 Skill 的 AI 工具。

我使用的是自己整理的 vox Skill(通过修改 https://github.com/Alisa0808/vox-director 的skill 而来)。它不会调用生成接口,而是负责分析风格板、拆分故事、规划关键帧,并为每一张图片编写中文提示词。

第四步:结合风格板生成全部图片
获得图片提示词后,将同一张风格板作为参考图,再逐条生成关键帧图片。
直接复制AI给的提示词,然后使用风格版进行图生图生成。




我生成的9个分镜
第五步:让 AI 编写首尾帧视频提示词
全部图片生成后,按正确顺序一起交给 AI。直接和AI说:
这是我生成完成的图片,现在给我视频提示词。

视频提示词截图
随后,将图 0 和图 1 作为第一组首尾帧,图 1 和图 2 作为第二组,图 2 和图 3 作为第三组,依次生成视频。

第六步:在剪映中串联视频
所有视频片段生成后,按照关键帧顺序导入剪映并首尾连接。先不要急着添加大量转场,因为 AI 生成的视频本身已经通过共享首尾帧建立连续性,最多加一个叠化。

第一次导出可以视为“无旁白成片”。它的作用是让 AI 看到真正的画面节奏,而不是根据剧本猜测音乐与口播。
第七步:根据成片生成 BGM 和英文口播
将剪映导出的完整视频交给 AI 分析,让它根据实际画面设计 BGM 和口播。我的口播正文使用英文,但用于控制声音风格、语速和情绪的提示词使用中文。
可以这样提问:
这是我拼接好的视频,你帮我想一下符合视频的bgm,还有口播提示词(口播是英文,提示词是中文,要有科普感,也要有写感情顿挫)

对话截图
这个案例中,BGM 使用即梦 SeedMusic 1.0 生成,
bgm生成提示词:
创作一首约62秒、无歌词、无人声的宇宙科学纪录片背景音乐,适合VOX式编辑拼贴科普视频。整体是“科学调查感”,不是史诗预告片,也不是恐怖片。速度约72 BPM,4/4拍,D小调或带少量多利亚调式色彩。主要音色:低频模拟合成器持续音、非常轻的脉冲贝斯、稀疏而清澈的玻璃质感音符、柔和低音弦乐、少量档案设备般的电子滴答与细微磁带颗粒;禁止人声、合唱和强烈主旋律。
0—6秒:从安静深空开始,低频持续音缓慢出现,单个高频玻璃音提出疑问,保留大量空间。
6—13秒:加入稳定但克制的低频脉冲,制造跨越2.6万光年的前进感,不使用强鼓点。
13—22秒:星群变密,增加细小高频闪烁和轻微节奏层,但不变得欢乐。
22—29秒:进入尘埃遮挡段,削弱高频,低音下沉,短暂形成闷住、看不清的悬念感。
29—39秒:红外观察开启,等离子青般的明亮合成器音色从暗处扫过,加入精密、循环的轨道脉冲,产生“科学仪器发现证据”的感觉。
39—48秒:揭晓人马座A*,低音弦乐和合成器缓慢扩张,形成全曲最有重量的一次上升,但不要使用大片式撞击或巨大铜管。
48—56秒:高温气体与密集恒星出现,节奏达到最高密度,加入旋转感的琶音和一次短促的青色耀斑音效,保持可让口播清晰穿透的中频空间。
56—62秒:随着镜头极限拉远,鼓点和脉冲迅速减少,只留下低频宇宙持续音、一个遥远高音和长混响;最后自然悬停,不做俗套重击结尾。
混音保持纪录片质感,动态克制,低频有深度但不轰鸣,中频为英文旁白留出空间。不要EDM鼓组,不要流行节拍,不要英雄主义和弦,不要恐怖尖啸,不要密集钢琴,不要过强转场音效。

即梦seedmusic 1.0生成界面
配音使用 Seed Audio 1.0 生成。
配音提示词:
请用自然、清晰的中性英文纪录片声音朗读下面的英文旁白。声音年龄感约30—45岁,音色温暖、沉稳、聪明,带有科学记者和宇宙纪录片解说员的可信度。使用清晰自然的国际化美式英语发音,不要夸张播音腔,不要商业广告感,不要电影预告片式低吼。
整体成片约62秒,平均语速约130词/分钟。表达必须有感情顿挫,但情绪保持克制:
- 开头带真诚好奇,像邀请观众共同出发;“what would we find?”前稍微放慢并上扬。
- “twenty-six thousand light-years”清楚强调数字,但不要逐字重读。
- 讲到“Yet strangely”时降低音量和音高,制造看不见银河中心的疑问。
- “Switch to infrared”要明显变亮、略微加快,表现观察方式被打开。
- “something we cannot see”前后各留短停顿,让不可见天体形成悬念。
- “Sagittarius A-star”发音清楚,并在名称前留一次短停顿;“more than four million times”加重但不喊。
- 最后两句明显放慢,声音从惊叹回到安静;“a dot”前留停顿,“the deepest place in our galaxy”温柔、辽阔地收束。
严格按照英文原文朗读,不读时间码,不读括号说明,不自行添加句子。保持自然呼吸,长句内部用轻微停顿分层,避免每句使用相同语调。不要把 Sagittarius A* 读作符号,读作“ Sagittarius A-star ”。 ```
## 英文口播正文|按成片时间
### 0:00—0:06|好奇、邀请感
> If we left Earth and flew toward the Milky Way’s center... what would we find?
### 0:06—0:13|清楚、建立尺度
> It lies about twenty-six thousand light-years away. As we approach, the stars crowd closer together.
### 0:13—0:22|逐渐惊叹,但不夸张
> The darkness begins to disappear, until space itself seems packed with light.
### 0:22—0:29|压低、制造疑问
> Yet strangely, the center remains hidden. Thick interstellar dust blocks its visible light.
### 0:29—0:39|声音变亮,进入证据
> Switch to infrared, and the hidden region appears. Stars race around something we cannot see—especially S2.
### 0:39—0:48|权威、加重核心答案
> Decades of tracking those orbits revealed the answer: Sagittarius A-star, a supermassive black hole more than four million times the mass of our Sun.
### 0:48—0:56|紧张感达到最高点
> Around it, stars and superheated gas move through one of the most extreme environments in our galaxy.
### 0:56—1:02|放慢、拉远、余韵
> Yet pull back... and even this monster becomes a dot. This is the deepest place in our galaxy.
## 一段式英文口播
```text If we left Earth and flew toward the Milky Way’s center... what would we find? It lies about twenty-six thousand light-years away. As we approach, the stars crowd closer together. The darkness begins to disappear, until space itself seems packed with light. Yet strangely, the center remains hidden. Thick interstellar dust blocks its visible light. Switch to infrared, and the hidden region appears. Stars race around something we cannot see—especially S2. Decades of tracking those orbits revealed the answer: Sagittarius A-star, a supermassive black hole more than four million times the mass of our Sun. Around it, stars and superheated gas move through one of the most extreme environments in our galaxy. Yet pull back... and even this monster becomes a dot. This is the deepest place in our galaxy.

seedAudio 1.0生成界面
第八步:完成混音、字幕和节奏微调
将生成的 BGM 和英文口播导入剪映,按照视频时间轴对齐。配上英文字幕或中英文字幕后,再进行最后一次节奏检查。

因为音乐和口播都是根据完整视频设计的,整体通常能较好地适配画面。如果只有少量偏差,可以对局部视频进行轻微加速或减速。调整幅度不要过大,否则可能破坏人物、星体和纸片运动的自然感。
完成字幕校对后,就可以导出最终成片。
视频生成执行卡
把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。
这节课不是先追求炫技成片,而是围绕「刺猬星球super-i_AI教程免费在线教学」先把主体、动作、镜头和节奏稳住。
按原文节奏走最稳:先吃透「准备工具」,再把「第一步:先生成一张风格板」定住,接着处理「第二步:准备一段适合画面表达的剧本」;最后用「第三步:用 Skill 生成图片提示词」收口。
- 先把「准备工具」里的主体和动作定死。
- 按「第一步:先生成一张风格板」去统一气质,不要只改表面。
- 做完「第二步:准备一段适合画面表达的剧本」后,先查连贯性和穿帮。
- 把「第三步:用 Skill 生成图片提示词」整理成可复制版本,后面直接复用。
- 按「第四步:结合风格板生成全部图片」去统一气质,不要只改表面。
- 把「第五步:让 AI 编写首尾帧视频提示词」整理成可复制版本,后面直接复用。
不要一上来就生成最终片;先拆镜头、定主体和运动,再逐段生成,否则容易跳轴、穿帮、节奏混乱。
检查主体是否稳定;镜头运动是否明确;前后画面是否连贯;节奏是否服务主题;是否有明显变形或穿帮。
请围绕「刺猬星球super-i_AI教程免费在线教学」帮我做一个可直接执行的方案。 我的目标是:【填写你的具体目标】 我的素材/产品/角色信息是:【填写已有素材和限制】 请输出:核心创意、分镜表、每个镜头的画面描述、视频生成提示词、剪辑顺序和成片自检清单。要求主体稳定、动作明确、镜头连贯。
